random forest
ランダムフォレスト
名詞
複数形: random forests
random forestは、複数の決定木を組み合わせることで、単一の決定木が陥りやすい過学習という問題を効果的に解決する手法です。個々の決定木はあえて異なるデータセットや特徴量を用いて学習させられ、最終的な結果を多数決や平均で決定することで、モデル全体の汎用性と安定性を高めています。
決定木との違い
単一の決定木(decision tree)は構造が単純で解釈しやすい反面、訓練データに過剰に適合しやすく、新しいデータに対する予測精度が低下する傾向があります。一方でrandom forestは、多くの木の予測を統合するアンサンブル学習を用いるため、個々の木の誤差が相殺され、より堅牢な予測が可能になります。
実務上の利点と活用シーン
この手法は、データの分布に強い耐性を持ち、欠損値がある場合や外れ値が含まれている場合でも比較的安定して動作します。そのため、以下のような場面で頻繁に活用されています。
顧客の離脱予測や信用スコアリングなどの分類タスク
不動産価格の予測や需要予測などの回帰タスク
どの変数が予測に大きく寄与しているかを分析する重要度の算出
意味
名詞ランダムフォレスト
学習中に複数の決定木を構築し、予測精度の向上と過学習の抑制のために、クラスの最頻値(分類)または個々の木の平均予測値(回帰)を出力する機械学習のアンサンブル手法のこと
The data scientist implemented a random forest to improve the accuracy of the credit scoring model.
データサイエンティストは、信用スコアリングモデルの精度を向上させるためにランダムフォレストを実装した。
関連語
algorithmmachine learningdecision treeensemblebaggingbootstrapaggregationpredictionclassificationregressionvariancebiasoverfittingunderfittingfeatureattributevariablenodeleafrootbranchsplitentropydatasettraining setaccuracyprecisionrecallconfusion matrixhyperparameterdepthestimatorforesttreerandomnesssamplingstochasticmodelinferencesupervisionlabeltargetweightprobabilitycorrelationcovariancedimensionsparsityoptimizationheuristiccomputationcomplexityperformancegeneralizationcross validationdata miningartificial intelligencestatisticsprobability distributionoutliernoise